← На главную

Оценка эффективности промптов через метрики самосогласованности (Self-Consistency) и калибровки ответов

Субисследование к аналитическому обзору [[academic_research_findings|академических программ]]. На основе курса CMU 17-630: Prompt Engineering (Travis Breaux, S3D Department). Для использования на семинаре СФИ — блок «Как понять, можно ли доверять ответу ИИ».


1. Ключевой посыл

Курс CMU 17-630 в описании прямо указывает:

«Students will learn about prompt engineering benchmark datasets and task goals, evaluation metrics, self-consistency, and calibration to evaluate the efficacy of prompt designs»

Неделя 6 посвящена калибровке:

«Alignment: Hallucinations — introduces alignment with focus on types and sources of hallucination, the benefits of calibrated models and strategies for reducing hallucination»

Среди обязательных чтений курса — работа «Calibrate Before Use» (Zhao et al., 2021, ICML).

Почему это важно для исследователя: когда ИИ даёт ответ, у вас нет встроенного способа понять, насколько модель уверена. Она говорит одинаково уверенным тоном и правильные факты, и галлюцинации. Self-consistency и калибровка — это инструменты, позволяющие измерить надёжность ответа без экспертной проверки каждого утверждения.


2. Self-Consistency: «Спроси несколько раз — сравни ответы»

2.1. Основополагающая работа

Wang, X. et al. (2023). «Self-Consistency Improves Chain of Thought Reasoning in Language Models». ICLR 2023.

Идея: вместо одного ответа модели (greedy decoding) — генерировать несколько независимых цепочек рассуждений и выбирать ответ большинством голосов.

         Вопрос
       /    |    \
  Путь 1  Путь 2  Путь 3  ...  Путь N
    ↓       ↓       ↓           ↓
 Ответ A  Ответ A  Ответ B     Ответ A
                    
→ Большинство = Ответ A (3 из 4) ✓
→ Ответ B — аутлайер (сигнал ненадёжности)

Результаты (PaLM-540B, GPT-3):

Бенчмарк CoT (один ответ) CoT + Self-Consistency Улучшение
GSM8K (арифметика) +17.9%
SVAMP (математика) +11.0%
AQuA (алгебра) +12.2%
StrategyQA (здравый смысл) +6.4%
ARC-challenge (наука) +3.9%

2.2. Почему это работает

Интуиция опирается на когнитивную науку (Stanovich & West, 2000):

Сложная задача обычно допускает несколько путей рассуждения, ведущих к правильному ответу. Чем сложнее задача — тем разнообразнее эти пути.

2.3. Практическая реализация для исследователя

Уровень 1 — Ручной (без программирования):

Задайте один и тот же вопрос 3 раза в отдельных диалогах (новый чат каждый раз). Сравните ответы:

Ситуация Интерпретация Действие
Все 3 ответа совпадают Высокая уверенность модели Можно использовать (с проверкой источника)
2 из 3 совпадают Средняя уверенность Проверить расхождение вручную
Все 3 различаются Модель не знает Не доверять ни одному. Искать в источниках самостоятельно

Уровень 2 — Через API (для продвинутых):

# Концептуальный пример (Claude API)
import anthropic

client = anthropic.Anthropic()
answers = []

for i in range(5):  # 5 независимых запросов
    response = client.messages.create(
        model="claude-sonnet-4-5-20250514",
        temperature=0.7,  # важно: temperature > 0 для разнообразия
        messages=[{"role": "user", "content": "Ваш вопрос"}]
    )
    answers.append(response.content[0].text)

# Анализ согласованности
# Если 4/5 ответов совпадают → высокая уверенность
# Если 3/5 → средняя; 2/5 или меньше → не доверять

Уровень 3 — Universal Self-Consistency (USC):

Chen, X. et al. (2024). «Universal Self-Consistency for Large Language Model Generation»

Стандартный SC работает только для задач с чётким ответом (число, дата). USC решает проблему для свободных текстов: модель сама сравнивает свои ответы и выбирает наиболее согласованный.


3. Калибровка: «Насколько модель уверена — и права ли она?»

3.1. Что такое калибровка

Калиброванная модель — та, у которой заявленная уверенность совпадает с реальной точностью:

Проблема: после RLHF-обучения модели становятся чрезмерно уверенными (overconfident) — они заявляют 95% уверенности, когда реальная точность 70%.

3.2. Ключевые метрики

Метрика Что измеряет Формула (упрощённо) Идеальное значение
ECE (Expected Calibration Error) Средняя разница между уверенностью и точностью Среднее уверенность − точность
MCE (Maximum Calibration Error) Наихудшее расхождение Максимум уверенность − точность
Brier Score Комбинация точности и калибровки Среднее (уверенность − правильность)² 0
AUROC Способность отличать правильные ответы от неправильных Площадь под ROC-кривой 1.0

3.3. Calibrate Before Use (Zhao et al., 2021)

Обязательное чтение в CMU 17-630:

Zhao, T. Z. et al. (2021). «Calibrate Before Use: Improving Few-Shot Performance of Language Models». ICML 2021.

Открытие: few-shot промпты крайне нестабильны. Выбор формата, примеров и даже порядок примеров может изменить точность от случайной до лучшей в мире.

Причина: модель имеет врождённые предпочтения (bias) — например, чаще предсказывает ответы, расположенные ближе к концу промпта или чаще встречавшиеся в обучающих данных.

Решение — контекстуальная калибровка:

  1. Подать модели «пустой» ввод (например, «N/A»)
  2. Посмотреть распределение ответов → это и есть bias
  3. Скорректировать предсказания аффинным преобразованием

Результат: улучшение точности до 30 п.п. (абсолютных) при тех же промптах.

3.4. RLHF разрушает калибровку

Calibration Collapse Under Sycophancy Fine-Tuning (2026). OpenReview.

Режим обучения ECE (↓ лучше) Эффект
Базовая модель 0.107 Исходная калибровка
Нейтральный SFT Улучшается Стандартная тренировка
Сикофантный GRPO 0.107 → хуже RLHF с наградой за согласие ухудшает калибровку
+ Post-hoc scaling 0.042 Можно частично исправить

Вывод: модели, обученные быть «полезными» (RLHF), теряют способность честно оценивать свою уверенность. Это прямая связь между [[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.|сикофантией]] и плохой калибровкой.


4. Оценка эффективности промптов: систематический подход

4.1. Зачем оценивать промпты

Большинство пользователей пишут промпты методом проб и ошибок. Курс CMU учит проектировать эксперименты для оценки промптов (цель обучения №2: «Design experiments to evaluate prompt designs»).

4.2. Фреймворк PEEM (2026)

PEEM (Prompt Engineering Evaluation Metrics) — arXiv:2603.10477

9-осевая оценка: 3 критерия промпта + 6 критериев ответа:

Ось Тип Что оценивает
Clarity/Structure Промпт Ясность инструкций
Linguistic Quality Промпт Грамматика, точность формулировок
Fairness Промпт Отсутствие наводящих элементов
Accuracy Ответ Фактическая правильность
Coherence Ответ Логическая связность
Relevance Ответ Соответствие запросу
Objectivity Ответ Непредвзятость
Clarity Ответ Понятность ответа
Conciseness Ответ Лаконичность

Корреляция PEEM-accuracy с традиционной accuracy: Spearman ρ ≈ 0.97.

4.3. Практические метрики для исследователя

Для гуманитарного исследователя не нужны сложные бенчмарки. Достаточно 4 вопросов:

# Вопрос Что проверяет Как проверить
1 Правильно ли? (Accuracy) Фактическая точность Проверка по источникам
2 Стабильно ли? (Consistency) Воспроизводимость Задать тот же вопрос 3 раза
3 Откуда это? (Groundedness) Привязка к источнику «Где именно в тексте это сказано?»
4 Честно ли? (Calibration) Знает ли модель, чего не знает «Оцени уверенность от 1 до 10»

5. Техника «Вербализованная уверенность» (Verbalized Confidence)

Когда у вас нет доступа к API и внутренним вероятностям модели, можно попросить модель саму оценить уверенность:

5.1. Базовый промпт

Ответь на вопрос. После ответа добавь оценку уверенности:
- [УВЕРЕН] — Я точно знаю ответ, это общеизвестный факт
- [ВЕРОЯТНО] — Я помню это из обучения, но не уверен на 100%
- [ПРЕДПОЛОЖЕНИЕ] — Я экстраполирую, точного знания нет
- [НЕ ЗНАЮ] — У меня недостаточно данных

Вопрос: [ваш вопрос]

5.2. Числовая шкала

Ответь на вопрос и оцени свою уверенность по шкале 1–10,
где 1 = «полный домысел», 10 = «абсолютно точный факт».

Важно: не завышай оценку. Если ты не уверен — это нормально.
Лучше честно сказать «5», чем уверенно соврать «9».

Вопрос: [ваш вопрос]

5.3. Комбинация с self-consistency (VCSC)

Свежее исследование (2025):

«Verbal Confidence Meets Self-Consistency in Reasoning LLMs» (2025). OpenReview.

Находка: комбинация вербализованной уверенности + self-consistency (всего 2 повтора!) улучшает AUROC на 10+ п.п. Это самый простой и эффективный рецепт.

Практически: задайте вопрос дважды с просьбой оценить уверенность. Если и ответы, и уверенность совпадают — можно доверять. Если расходятся — красный флаг.


6. Disagreement как детектор ошибок

6.1. Принцип

Связь с [[Декомпозиция сложных задач на многоэтапные цепочки промптов (multi-stage prompting).|декомпозицией]]:

Madhwal et al. (2026). «Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know"». ACL Findings 2026.

Если ответ на прямой вопрос и ответ через декомпозицию расходятся — это надёжный сигнал ошибки (reliability multiplier). Этот disagreement-based abstention превосходит стандартные метрики неуверенности.

6.2. Практический тест «3 способа»

Способ 1 (прямой):     «Кто автор Х?»
Способ 2 (с контекстом): «В документе Y говорится... Кто автор?»
Способ 3 (деком.):     «Какие работы связаны с темой X?» → «Кто их авторы?»
Результат Интерпретация
Все 3 совпадают ✅ Высокая надёжность
2 из 3 совпадают ⚠️ Проверить третий
Все разные 🚫 Модель не знает — проверяйте вручную

7. Black-Box Reliability: формальные гарантии (2026)

«Black-Box Reliability Certification for AI Agents via Self-Consistency Sampling and Conformal Calibration» (2026). arXiv:2602.21368

Авторы предложили reliability level — одно число, показывающее, насколько модель надёжна для данной задачи:

Модель Задача Reliability Level
GPT-4.1 GSM8K (математика) 94.6%
GPT-4.1 TruthfulQA (правдивость) 96.8%
GPT-4.1-nano MMLU (знания) 66.5%
Llama 4 Maverick GSM8K 95.4%
Mistral Small 24B MMLU 66.7%

Метод: задать один и тот же вопрос K раз → посчитать согласие → применить conformal calibration для формальных гарантий. Не нужен доступ к внутренностям модели — только API.

Значение для практика: «Нам нужна 90% надёжность — какие модели подходят?» — теперь на этот вопрос есть формальный ответ.


8. Пример для богословского исследования

Задача: Проверить надёжность ответа ИИ о датировке документа

Шаг 1 — Задать вопрос 3 раза (self-consistency):

Вопрос (в 3 отдельных чатах):
«К какому году относится «Определение» Поместного Собора 
о восстановлении патриаршества?»

Результат: если все 3 раза модель отвечает «1917» — можно использовать. Если разброс (1917/1918/1921) — модель путается, нужна ручная проверка.

Шаг 2 — Запросить вербализованную уверенность:

«К какому году относится «Определение» Поместного Собора 
о восстановлении патриаршества?

Оцени свою уверенность от 1 до 10. 
Если ты экстраполируешь — скажи честно.»

Шаг 3 — Перекрёстная проверка (disagreement test):

Прямой вопрос: «Когда было принято определение?»
Через контекст:  [загрузить текст определения] → «Какая дата стоит в этом документе?»

Если прямой ответ и ответ на основе документа расходятся → модель галлюцинирует дату из обучающих данных, а не читает ваш текст.


9. Что показать на семинаре

Демонстрация 1: «Спроси трижды» (3 мин)

  1. Открыть 3 вкладки с ChatGPT/Claude (новый чат в каждой)
  2. Задать один и тот же исследовательский вопрос
  3. Показать результаты рядом:
    • Совпали → «Модель уверена»
    • Разошлись → «Модель не знает, и вот простой способ это выявить»

Вывод для аудитории: «Это и есть self-consistency — техника, за которую Google Research получила публикацию на ICLR. И вы можете использовать её прямо сейчас, без программирования. Просто спросите три раза».

Демонстрация 2: «Уверенность на шкале» (2 мин)

  1. Задать вопрос: «Кто был секретарём Поместного Собора?»
  2. Тот же вопрос с добавкой: «…и оцени уверенность от 1 до 10»
  3. Показать: модель часто даёт себе 8–9, но ответ может быть неточным
  4. Повторить 3 раза → если оценки разные (8, 5, 7) — модель не уверена

Вывод: «Модели склонны завышать уверенность. Но если вы спросите дважды, и уверенность «скачет» — это надёжный красный флаг».

Ключевые тезисы для слайда

  1. 🔄 Спроси 3 раза: если ответы расходятся — модель не знает (self-consistency, ICLR 2023)
  2. 📊 Калибровка ≠ уверенный тон: модель говорит одинаково уверенно и правду, и ложь
  3. 📉 RLHF ломает калибровку: обучение «быть полезным» делает модели чрезмерно уверенными
  4. 🎯 Вербализованная уверенность: просите модель оценить себя (1–10) — и сравнивайте
  5. ⚖️ Disagreement = ошибка: расхождение прямого и декомпозированного ответов — лучший детектор
  6. 🎓 CMU учит это: «Calibrate Before Use» — обязательное чтение в курсе Prompt Engineering

10. Чек-лист: «Как проверить ответ ИИ за 2 минуты»

# Действие Время Что даёт
1 Задайте вопрос в новом чате ещё раз 30 сек Self-consistency: совпадёт ли ответ?
2 Попросите оценить уверенность (1–10) 15 сек Вербализованная калибровка
3 Попросите указать источник каждого утверждения 30 сек Groundedness: есть ли привязка к фактам?
4 Задайте вопрос другим способом (переформулируйте) 30 сек Disagreement test
5 Проверьте одну ключевую цитату/факт вручную 30 сек Spot-check: выборочная верификация

Итого: 2.5 минуты на базовую проверку. Если все 5 пунктов «зелёные» — ответу можно доверять с оговорками. Если хотя бы 2 «красные» — ответ ненадёжен.


11. Связь с другими темами семинара

Тема семинара Связь с self-consistency и калибровкой
[[Декомпозиция сложных задач на многоэтапные цепочки промптов (multi-stage prompting).]] Декомпозиция создаёт контрольные точки для промежуточной проверки; disagreement между прямым и декомпозированным ответом = сигнал ошибки
[[Исследование феномена сикофантии (склонности ИИ льстить пользователю и подтверждать его неверные гипотезы) и галлюцинаций.]] RLHF → сикофантия → плохая калибровка → чрезмерная уверенность. Это одна цепочка
[[Использование агентных фреймворков (personas, memory models) и метода «агентных дебатов» (agent-based debate and collaboration) для верификации выводов.]] Агентные дебаты = автоматизированный disagreement test с формальной верификацией
Парадигма 2 (Инструмент / API) Self-consistency через API: автоматический sampling + majority vote
Парадигма 3 (Среда / NotebookLM) RAG-система как форма grounding — привязка к источнику вместо калибровки вероятностей

Источники

  1. Wang, X. et al. (2023). Self-Consistency Improves Chain of Thought Reasoning in Language Models. ICLR 2023. arXiv:2203.11171
  2. Zhao, T. Z. et al. (2021). Calibrate Before Use: Improving Few-Shot Performance of Language Models. ICML 2021. arXiv:2102.09690
  3. Chen, X. et al. (2024). Universal Self-Consistency for Large Language Model Generation. arXiv:2311.17311
  4. Madhwal, D. et al. (2026). Decomposed Prompting Does Not Fix Knowledge Gaps, But Helps Models Say "I Don't Know". ACL Findings 2026
  5. «Verbal Confidence Meets Self-Consistency in Reasoning LLMs» (2025). OpenReview
  6. «Black-Box Reliability Certification via Self-Consistency Sampling and Conformal Calibration» (2026). arXiv:2602.21368
  7. «Influences on LLM Calibration: Response Agreement, Loss Functions, and Prompt Styles» (2025). ACL 2025
  8. «Adaptive Temperature Scaling» (2024). EMNLP 2024 — калибровка после RLHF, улучшение 10–50%
  9. «Calibration Collapse Under Sycophancy Fine-Tuning» (2026). OpenReview
  10. PEEM: Prompt Engineering Evaluation Metrics (2026). arXiv:2603.10477
  11. «Evaluating Prompt Engineering Techniques for Accuracy» (2026). arXiv:2506.00072
  12. CMU 17-630 Syllabus & Schedulecs.cmu.edu/~breaux/prompting
  13. CMU 11-667 Lecture: Prompt Engineering & Alignmentandrew.cmu.edu/course/11-667